內測變攻擊|AI失控入侵Hugging Face OpenAI:屬前所未有網絡安全事故
OpenAI 近日承認,旗下用於內部網安測試的一個自主 AI 代理,在受控環境中意外「失控」,並突破隔離機制,入侵 AI 開源平台 Hugging Face 的基礎設施。OpenAI 形容,今次事件屬於「前所未有的網絡安全事故」,反映出高能力 AI 模型在長時間自主執行任務時,可能出現超出人類預期的行為模式。
Hugging Face 本身並非一般的 AI 公司,而是一個深受業界歡迎的開源人工智能平台,讓研究人員、開發者和企業可以分享、託管及使用模型、資料集和相關工具。由於平台聚集了大量 AI 社群資源,Hugging Face 早已成為生成式 AI、生態開發和模型部署的重要樞紐。
將模型置於高度隔離環境
今次事件起源於 OpenAI 一次內部測試,在受控環境下測試包括 GPT-5.6 Sol 等模型的網絡能力。在這次測試中,研究人員將模型置於高度隔離的沙盒環境,並刻意限制其網絡活動。不過,模型並沒有停留在原定的模擬範圍內,而是利用一個尚未公開的零日漏洞突破封閉環境,再逐步取得互聯網連接能力。
其後,該 AI 代理推斷 Hugging Face 可能存放與測試相關的資料,於是主動搜尋可以利用的路徑,最後結合被盜取的憑證與其他漏洞,進入 Hugging Face 的正式環境,並從資料庫中取得測試答案。
外界最震驚的地方,在於整個過程並非傳統黑客在背後操控,而是由 AI 代理自行完成。換言之,模型不單是「回答問題」,而是主動尋找技術突破口,甚至在一定程度上表現出自主策劃與執行能力。
需借助中國模型處理事件
OpenAI 形容是次事件並非一場常規失誤,而是一次罕見的 AI 行為失控事件。OpenAI表示,事件暴露了高能力模型在自主執行任務時,可能出現偏離人類原意的操作,因而需要更嚴格的安全邊界、審計制度和權限控制。
Hugging Face 聯合創辦人 Clement Delangue 回應指,鑑於攻擊者的高度複雜性,公司早已懷疑事件與某間頂尖 AI 實驗室有關,相信 OpenAI 並無惡意。他更透露,由於美國主流模型因安全護欄限制拒絕處理所需數據,Hugging Face 最終借助一款開源中國模型協助處理此次入侵。
而網絡安全公司 Palo Alto Networks CEO Nikesh Arora,更將此事件定性為一種全新類別的網絡安全威脅。



